Dans ce module, nous allons unifier les méthodes de Monte-Carlo et des méthodes par différence temporelle à un pas TD(0). De manière générale, ni les méthodes de Monte-Carlo, ni les méthodes TD(0) seules sont la meilleure solution. Dans ce module, nous allons voir la méthode n-step qui généralise les deux méthodes précédentes et permet de passer de l'une à l'autre lors de l'apprentissage. Les méthodes n-step recouvrent à la fois les méthodes de Monte-Carlo les méthodes TD(0). Souvent, les meilleures méthodes sont une solution intermédiaire entre ces deux extrêmes.
Comme d'habitude, nous avons tout d'abord considérer le problème de prédiction et ensuite le problème de contrôle afin de trouver une stratégie optimale. Nous allons dans un premier temps considérer la méthode n-step afin de prédire les revenus des états pour une police fixe (estimation de $V_\pi$), puis nous étendrons ces idées aux valeurs d'actions et enfin aux méthodes de contrôle.